第 10 次更新是這趟訓練表現最好的 checkpoint,在 256 道開發集題目上答對 32 題,Base 則答對 41 題。Day 24 的實驗結果已經追上少掉的 9 題、真正產生梯度的 5 組 prompts,以及快速消失的長輸出。到了本日、也是 RLVR 系列的最後一篇,我們要來決定是否要把這份 checkpoint 送進最後的測試集?
最終的判斷是這份 checkpoint 不晉級。
開發集答對題數 Base 41/256,最佳 RLVR 32/256
成對差異 -9 題
95% paired bootstrap interval -7.81 到 0.78 個百分點
是否通過開發集門檻 否
500 題 final heldout 推論數 0
MATH-500 推論數 0
事前固定的規則要求 RLVR checkpoint 答對題數嚴格高於 Base,而且成對 bootstrap interval 的下界不得低於 0;這次兩項都沒有通過,所以 Base 仍是本輪實驗較好的選擇。訓練程式、checkpoint reload 與評估流程在實驗當時都通過驗證,候選模型依然可以落選;「實驗有沒有可信地跑完」和「模型有沒有變強」本來就是兩個問題。
這也讓停止本身成為結果,400 個 rollouts 只有 7 個正解落在對錯並存、能形成相對學習訊號的組別裡,後面五份 checkpoint 又全部低於 Base。繼續用同一批 256 題改配方,只會逐步把開發集變成調參用的答案簿;打開 final heldout,也無法替輸出長度塌縮撰寫原因。
數學、程式碼、理論科學等很適合 RLVR,因為最後答案通常能交給等價判定或形式化驗證,程式碼也有測試案例可用。然而摘要、研究整理與創意寫作就比較麻煩,它們是不存在標準答案的:同一份材料可以有好幾種合格摘要,一篇故事也沒有唯一 reference answer。人類偏好、reward model 或 LLM judge 都是可以考慮的給分方式,代價是評估偏差、judge 的能力上限,以及每個 rollout 都要多付一次推論成本。
《From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement》提出的 Reinforcement Learning with Self-Verifiable Rewards(RLSVR)借用 self-supervised learning 的相法,先把原本沒有標準答案的任務改造成一個會自行留下正確紀錄的 proxy environment,再讓 RL 從這個環境取得 reward。
RLSVR 直接改造任務本身。
原始的開放式任務
→ 環境先抽出一個隱藏條件,並把它記作 ground truth
→ 模型在不同條件下完成原本的任務
→ 參與者只根據公開輸出推回隱藏條件
→ 環境用自己的紀錄判定答案,產生 reward
這裡的 self-verifiable 並不是讓模型替自己的輸出產物評分,ground truth 在互動開始以前就由環境建立,例如哪一份輸入被遮掉、哪一位參與者拿到不完整資訊;最後只要拿互動結果和這份紀錄比較,判分便不需要 reference answer、人工標註或另一個 LLM judge。真正困難的工作,轉到如何設計一個仍然要求目標能力的 proxy task。
論文用 SpyRL示範這個轉換,多個 agents 同時做摘要、創意寫作或數學推理,其中大部分人拿到完整材料,預先指定的 spy 只看到被遮掉一部分的版本。所有輸出公開之後,參與者彼此投票找出 spy;環境早就知道 spy 是誰,所以「有沒有抓對人」可以精確判定。
換言之,SpyRL 把一篇摘要改造成一場抓間諜的遊戲。抓對 spy 的 detection reward 是確定的,performing reward 則來自每份輸出收到多少懷疑票:資訊完整的玩家若寫得像缺乏資料者,便更容易被投票揪出來;spy 若能掩飾自己的資訊缺口,就能取得較好的相對 reward。這使摘要與寫作能力進入可判分的互動,但可精確驗證的仍是預先指定的 spy 身分,不是「這篇摘要的品質等於 0.83」之類突然出現的、看起來客觀的數值。
當然,在任務轉換上,遊戲裡的勝負必須依賴原始任務能力。論文在摘要與創意寫作各抽 100 場遊戲,收到愈多懷疑票的輸出,在 GPT-4o 排名中也傾向愈差;作者另外以人類評估創意寫作,並在 Qwen3-4B 與 Qwen3-8B 上報告摘要、寫作和數學推理的改善。
此外,SpyRL 的消融實驗顯示,只更新 performing stage、讓 detection module 固定不動時,前段雖然能改善,後來會因 detector 分不出更細的品質差異而停滯、震盪;performer 與 detector 交替訓練,才讓兩邊一起移動。這裡保持不變的是環境指定的 spy 身分與核對規則,必須跟著能力成長的是負責從輸出辨認 spy 的 detection policy。把兩者都叫作 verifier,反而會漏掉方法真正做了什麼。
RLSVR 也沒有自動修好我們前四天遇到的稀疏 reward 與 policy drift。SpyRL 使用 clipped objective、reference-policy KL、role-aware advantage 和兩階段交替訓練,配方、模型規模與互動環境都和本次 Qwen3-0.6B 實驗不同。若參與者全都抓錯、只利用表面線索,或 proxy task 與目標能力脫鉤,環境照樣可能提供大量精確卻沒有用的分數。
RLSVR 論文本身沒有展示模型自行改寫架構、optimizer 或訓練程式,也沒有證明一條可以無限延伸的自我改進迴圈。它示範的是一個較小、但更具體的環節:當目標任務沒有現成 verifier,可以藉由任務轉換建立可核對的互動結果;當 performer 進步,detector 也需要更新,否則 reward 很快會失去解析度。
在這幾天鐵人賽文章討論 RLVR 的最後,我認為應該要來談 recursive self-improvement,這可能是次世代的、更好的強化學習方式。能長期使用的 reward 至少要確保三件事:結果可以核對、同一組候選仍有差異,而這項差異確實要求我們想提升的能力。本次實驗只保證了第一件事,卻有 45/50 組拿到完全相同的 reward;SpyRL 嘗試用對手、隱藏資訊與共同演化的 detector,讓後兩件事也能持續成立。
Day 21 先問模型推理正確而得到的 1 分從何而來來,Day 25 得到的答案已經不只是一個正確的 verifier。下一個分數還得出現在合適的難度,並且讓模型真正地動用我們關心的能力,並衍伸介紹了 RLSVR、以及其如何把這件事改寫成環境設計問題。
我們的 RLVR 沒有產生有價值的 checkpoint,SpyRL 也偏向 journal reading,並非本專案的重現結果。Day 26 將換另一個方法嘗試,也就是俗稱的「知識蒸餾」:從經 verifier 篩選的公開 teacher traces 開始,檢查成功的解題軌跡能不能被轉移到 (0.6B base) student。